Từ điển học thuật

Học tăng cường là gì? Các nghiên cứu khoa học về Học tăng cường

Học tăng cường (Reinforcement Learning) là một lĩnh vực của học máy, nơi tác nhân học cách đưa ra quyết định thông qua tương tác với môi trường nhằm tối đa hóa phần thưởng. Phương pháp này mô phỏng quá trình học bằng thử - sai để tìm ra chiến lược hành động tối ưu.

705 lượt xem Cập nhật 2/9/2026

Học tăng cường là gì?

Học tăng cường (Reinforcement Learning - RL) là một nhánh quan trọng của học máy (machine learning), trong đó một tác nhân (agent) học cách hành động trong môi trường nhằm tối đa hóa tổng phần thưởng tích lũy theo thời gian. Học tăng cường mô phỏng quá trình học hỏi thông qua trải nghiệm, gần giống với cách con người và động vật học các hành vi mới thông qua việc thử - sai và nhận phản hồi từ môi trường.

Khác với học có giám sát (supervised learning), nơi các dữ liệu được gán nhãn sẵn, hay học không giám sát (unsupervised learning) tập trung vào tìm cấu trúc ẩn trong dữ liệu, học tăng cường chú trọng vào quá trình ra quyết định tuần tự (sequential decision-making). Tác nhân phải chọn hành động sao cho đạt được lợi ích lâu dài, thay vì chỉ tối ưu hóa lợi ích ngắn hạn.

Thành phần cơ bản trong học tăng cường

Một bài toán học tăng cường thường được mô hình hóa bằng Markov Decision Process (MDP). Đây là khuôn khổ toán học giúp mô tả rõ ràng môi trường và cách tác nhân tương tác với môi trường đó.

Các thành phần chính trong một MDP bao gồm:

  • Trạng thái (S): Đại diện cho tình huống hiện tại của môi trường. Ví dụ: vị trí hiện tại của robot trong một bản đồ.
  • Hành động (A): Những gì tác nhân có thể thực hiện tại mỗi trạng thái. Ví dụ: đi tới trái, phải, tiến, lùi.
  • Xác suất chuyển trạng thái (P): Xác suất mà môi trường sẽ chuyển từ trạng thái ss sang ss' khi thực hiện hành động aa, ký hiệu là P(ss,a)P(s'|s,a).
  • Hàm phần thưởng (R): Mức độ phần thưởng mà tác nhân nhận được khi chuyển trạng thái do hành động gây ra. Ví dụ: R(s,a,s)R(s,a,s').
  • Hệ số chiết khấu (γ): Tham số xác định tầm quan trọng của phần thưởng trong tương lai so với hiện tại. 0γ10 \leq \gamma \leq 1.

Chính sách, hàm giá trị và mục tiêu

Mục tiêu của học tăng cường là tìm ra một chính sách tối ưu – một chiến lược chọn hành động tại mỗi trạng thái – để tối đa hóa tổng phần thưởng nhận được trong dài hạn.

Chính sách thường được ký hiệu là π(as)\pi(a|s), nghĩa là xác suất chọn hành động aa khi ở trạng thái ss. Hai khái niệm then chốt trong việc đánh giá hiệu quả của chính sách là:

  • Hàm giá trị trạng thái: Vπ(s)=Eπ[Rtst=s]V^{\pi}(s) = \mathbb{E}_{\pi}[R_t|s_t = s] – tổng phần thưởng kỳ vọng khi bắt đầu từ trạng thái ss và hành động theo chính sách π\pi.
  • Hàm giá trị hành động: Qπ(s,a)=Eπ[Rtst=s,at=a]Q^{\pi}(s,a) = \mathbb{E}_{\pi}[R_t|s_t = s, a_t = a] – phần thưởng kỳ vọng khi thực hiện hành động aa tại trạng thái ss rồi tiếp tục theo chính sách π\pi.

Phân loại các phương pháp học tăng cường

Các thuật toán RL có thể được chia thành ba loại chính:

  • Model-free: Không học mô hình của môi trường, học trực tiếp từ tương tác.
  • Model-based: Học một mô hình của môi trường và sử dụng nó để mô phỏng và lên kế hoạch.
  • On-policy vs. Off-policy: On-policy học từ chính sách hiện tại, Off-policy học từ một chính sách khác (ví dụ: Q-learning).

Các thuật toán RL phổ biến

Q-learning

Là thuật toán off-policy, model-free. Q-learning tìm giá trị tối ưu cho mỗi cặp trạng thái - hành động thông qua quy tắc cập nhật:

Q(s,a)Q(s,a)+α[r+γmaxaQ(s,a)Q(s,a)]Q(s,a) \leftarrow Q(s,a) + \alpha [r + \gamma \max_{a'} Q(s',a') - Q(s,a)]

Trong đó α\alpha là tốc độ học (learning rate), rr là phần thưởng nhận được khi chuyển từ ss sang ss' sau hành động aa.

Deep Q-Network (DQN)

DQN mở rộng Q-learning bằng cách sử dụng mạng nơ-ron sâu để xấp xỉ hàm Q. Điều này cho phép tác nhân xử lý không gian trạng thái rất lớn (như ảnh đầu vào từ trò chơi Atari). DQN sử dụng hai kỹ thuật chính:

  • Replay memory: Lưu trữ các trải nghiệm cũ và lấy ngẫu nhiên để huấn luyện.
  • Target network: Dùng một bản sao mạng nơ-ron để tính mục tiêu cập nhật ổn định hơn.

Policy Gradient

Thay vì học giá trị hành động, phương pháp này trực tiếp điều chỉnh các tham số của chính sách để tối đa hóa phần thưởng kỳ vọng:

J(θ)=Eπθ[logπθ(as)Qπ(s,a)]\nabla J(\theta) = \mathbb{E}_{\pi_{\theta}}[\nabla \log \pi_{\theta}(a|s) Q^{\pi}(s,a)]

Thuật toán nổi bật là REINFORCE, nhưng có phương sai cao. Vì thế, các kỹ thuật như baselineActor-Critic được sử dụng để cải thiện.

Actor-Critic

Kết hợp chính sách (actor) và hàm giá trị (critic). Actor quyết định hành động nào cần thực hiện, còn Critic đánh giá hành động đó tốt hay không. Phương pháp này tận dụng ưu điểm của cả Q-learning và Policy Gradient.

Ứng dụng thực tế của học tăng cường

Học tăng cường đã và đang được ứng dụng rộng rãi trong nhiều lĩnh vực:

  • Trò chơi: RL được sử dụng để phát triển các AI chiến thắng con người trong cờ vua, cờ vây và các trò chơi điện tử như AlphaGo, OpenAI Five.
  • Robot học: Giúp robot học cách di chuyển, thao tác vật thể, và tương tác với con người.
  • Xe tự hành: RL giúp xe tự học cách điều khiển, né vật cản và tối ưu tuyến đường.
  • Tài chính: Tối ưu hóa danh mục đầu tư, chiến lược giao dịch tự động.
  • Hệ thống đề xuất: Điều chỉnh nội dung hiển thị theo hành vi người dùng theo thời gian.

Thách thức trong học tăng cường

  • Khó khăn trong huấn luyện: Quá trình học có thể rất tốn thời gian và tài nguyên vì yêu cầu số lượng lớn tương tác với môi trường.
  • Phần thưởng khan hiếm: Trong nhiều môi trường, phần thưởng không xuất hiện thường xuyên, khiến quá trình học kém hiệu quả.
  • Vấn đề ổn định: Các thuật toán như DQN có thể không hội tụ hoặc dao động nếu không được thiết kế cẩn thận.
  • Khả năng tổng quát: Mô hình RL có thể học rất tốt trên môi trường cụ thể nhưng khó áp dụng vào môi trường mới (khả năng generalization thấp).

Tài nguyên và nơi học thêm

Kết luận

Học tăng cường là một lĩnh vực năng động và đang phát triển mạnh mẽ, đặc biệt khi kết hợp với học sâu để tạo ra các hệ thống có khả năng học hỏi, thích nghi và ra quyết định trong môi trường phức tạp. Dù còn nhiều thách thức kỹ thuật và lý thuyết, học tăng cường vẫn là nền tảng quan trọng để xây dựng các hệ thống trí tuệ nhân tạo mạnh trong tương lai.

Các nghiên cứu khoa học về “học tăng cường”

Công bố nổi bật trên thế giới và tại Việt Nam, kèm tóm tắt theo hướng chủ đề.

Trích dẫn nhiều nhất

  • RDDRL: một mô hình học sâu tăng cường suy diễn tuần hoàn cho điều hướng robot-vision đa mô hình

    Dịch bởi AIRDDRL: a recurrent deduction deep reinforcement learning model for multimodal vision-robot navigation

    Li, Zhenyu và cộng sự2023

    AI tóm tắt

    Đề xuất mô hình học tăng cường sâu suy luận tuần hoàn RDDRL nhằm giải quyết bài toán điều hướng thị giác cho robot di động trong môi trường phức tạp. Nhóm tác giả tích hợp cơ chế lý luận tuần hoàn RRM để lưu trữ ký ức, dự đoán chuyển tiếp trạng thái và kết hợp thông tin thị giác đa mô hình. Thử nghiệm trên nền tảng CARLA cho thấy phương pháp giảm tỷ lệ va chạm từ 0,2% xuống 0,0%, nâng cao độ an toàn vận hành.

  • Coaching: tăng tốc học tăng cường thông qua phương pháp hỗ trợ của con người

    Dịch bởi AICoaching: accelerating reinforcement learning through human-assisted approach

    Nakarin Suppakun và cộng sự2020Progress in Artificial Intelligence

    AI tóm tắt

    Nghiên cứu giới thiệu phương pháp huấn luyện có sự hỗ trợ của con người (coaching) nhằm tăng tốc thuật toán học tăng cường trong môi trường phần thưởng thưa thớt. Bằng cách cung cấp các mục tiêu trung gian giúp tác nhân định hướng không gian trạng thái, phương pháp rút ngắn đáng kể thời gian khám phá ban đầu mà vẫn bảo đảm chính sách tối ưu hội tụ. Hiệu quả thuật toán được kiểm chứng thành công trên các bài toán điều khiển kinh điển.

  • Lắp kim linh hoạt hỗ trợ bởi robot sử dụng học tăng cường phân phối toàn cầu

    Dịch bởi AIRobot-assisted flexible needle insertion using universal distributional deep reinforcement learning

    Xiaoyu Tan và cộng sự2019

    AI tóm tắt

    Nghiên cứu đề xuất khung lập kế hoạch quỹ đạo cấy kim linh hoạt trong phẫu thuật xâm lấn tối thiểu dựa trên kỹ thuật học tăng cường sâu phân phối toàn cầu (UDQL). Thuật toán tối ưu hóa chính sách điều khiển và quản lý rủi ro thông qua trực quan hóa phân phối giá trị Q trong không gian trạng thái liên tục. Kết quả thực nghiệm mô phỏng cho thấy độ chính xác cao và nâng cao tính ổn định điều khiển robot phẫu thuật.

Nổi bật tại Việt Nam

  • So sánh học tăng cường ràng buộc với các bộ điều khiển truyền thống trong điều chỉnh điện áp và chất lượng điện năng trên lưới phân phối IEEE 33-BUS

    Nguyen Minh Cuong2026Tạp chí Nghiên cứu Khoa học và Công nghệ quân sự0 trích dẫn

    AI tóm tắt

    Nghiên cứu so sánh hiệu năng của thuật toán học tăng cường có ràng buộc với các bộ điều khiển PI, Droop và tối ưu dự báo trên lưới phân phối IEEE 33 nút. Dựa trên mô hình DistFlow tuyến tính, thuật toán đạt thời gian xác lập 16,8 giờ, độ quá điều chỉnh 3,20% và tổn thất công suất 0,145 MW. Kết quả chỉ ra ưu thế vượt trội của học tăng cường trong việc duy trì điện áp 0,95–1,08 pu và bảo đảm chất lượng điện năng.

  • Thiết kế điều khiển hệ truyền động xoay chiều với kỹ thuật học tăng cường

    LTT Hoa và cộng sự2024Tạp chí Nghiên cứu Khoa học và Công nghệ quân sự0 trích dẫn

    AI tóm tắt

    Ứng dụng kỹ thuật học tăng cường không mô hình để thiết kế bộ điều khiển thích nghi cho động cơ không đồng bộ ba pha xoay chiều. Đối mặt với đặc tính phi tuyến và sự biến thiên thông số tải của máy điện, tác nhân học tăng cường tự động hiệu chỉnh tín hiệu điều khiển trực tuyến thay thế bộ điều khiển PID truyền thống. Kết quả mô phỏng cho thấy hệ thống duy trì chất lượng bám vận tốc ổn định trước các nhiễu loạn tham số.

  • Ứng dụng phương pháp học tăng cường đa tác nhân giải bài toán lựa chọn phương tiện hỏa lực trong hệ thống tự động hóa chỉ huy-điều khiển

    XT Nguyễn và cộng sự2024Tạp chí Nghiên cứu Khoa học và Công nghệ quân sự0 trích dẫn

    AI tóm tắt

    Nghiên cứu ứng dụng phương pháp học tăng cường sâu đa tác nhân (Multi-Agent DRL) để giải quyết bài toán phân công vũ khí đánh chặn mục tiêu động (DTWA) trong hệ thống chỉ huy phòng không. Mô hình xây dựng trên thư viện OpenAI Gym kết hợp thuật toán Deep Q-Learning để tối ưu hóa phối hợp hỏa lực. Kết quả mô phỏng thể hiện khả năng tự động phân tích tình huống, phối hợp tác chiến và giảm thiểu hàm tổn thất toàn cục.

  • Thuật toán học tăng cường ứng dụng trong bài toán điều khiển thích nghi thông minh

    NV Đức và cộng sự2024Tạp chí Nghiên cứu Khoa học và Công nghệ quân sự0 trích dẫn

    AI tóm tắt

    Thiết kế bộ điều khiển thích nghi thông minh dựa trên thuật toán học tăng cường cho các đối tượng điều khiển phi tuyến phức tạp có cấu trúc và tham số bất định. Thuật toán tự động cập nhật và tinh chỉnh luật điều khiển trực tuyến nhằm bù trừ các thành phần chưa biết trong mô hình động học. Kết quả mô phỏng kiểm chứng tính bền vững, khả năng thích nghi cao và nâng cao chất lượng điều khiển tổng thể của hệ thống.

  • ĐIỀU KHIỂN BÁM TÀU MẶT NƯỚC BẤT ĐỊNH MÔ HÌNH VÀ NHIỄU NGOÀI THÔNG QUA BỘ ĐIỀU KHIỂN HỌC TĂNG CƯỜNG THÍCH NGHI TRỰC TUYẾN VÀ RISE

    TV Van2021Tạp chí Nghiên cứu Khoa học và Công nghệ quân sự0 trích dẫn

    AI tóm tắt

    Đề xuất giải pháp điều khiển bám quỹ đạo cho tàu mặt nước chịu bất định mô hình và nhiễu sóng ngoài dựa trên học tăng cường thích nghi (ARL) kết hợp thuật toán RISE. Mạng diễn viên - phê bình (actor-critic) được hiệu chỉnh đồng thời để xấp xỉ chính sách điều khiển và hàm giá trị chi phí. Phân tích lý thuyết và mô phỏng số làm rõ tính hội tụ của trọng số mạng cùng chất lượng bám quỹ đạo tiệm cận ổn định.